[[我也希望安全第一]]|第 23/30 天
Microsoft 在 9 月公開 AI 行為準則,把不得攻擊系統、協助核武、製作深偽,以及不得欺騙人類或逃避關閉寫成紅線。這比一句「負責任地發展 AI」具體很多,但讀到這裡,我還是不知道一件事:模型踩線時,誰能真的擋下發布?
一份準則可以拿來訓練、寫測試,也可以在事故後作為追問依據。它自己沒有權限停掉 release pipeline。若同一家公司決定測什麼、看到什麼、如何解讀,最後又決定是否照常上線,這比較像一把由屋主自行保管鑰匙的鎖。
前面一直在問「哪一道防線應該攔住 Agent」。從這篇開始,問題往外移一層:誰有資格判斷那些防線夠不夠?
OpenAI 新成立的數學顧問小組剛好提供一個容易混淆的對照。九位數學家不支薪,可以主動提出建議、管理成員,也能公開表達意見;但 OpenAI 與合作的高等研究院都說得很清楚,小組不能決定公司的研究方向與發布節奏。這是一個有發言權的諮詢機制,不是一道能踩煞車的門。
這種安排並非沒有價值。外部專家能提醒公司別把「解決超過一百個開放問題」當成已經逐題驗證,也能把學界的署名和同行審查規範帶進討論。只是評估一個治理安排時,不能看到「外部專家」四個字就自動補上停止權。
OpenAI、Anthropic 與 Google DeepMind 在 2026 年討論共同安全機制、第三方評估與產業標準。合作有價值,因為災難性風險不會尊重公司邊界;可是三家競爭者一起決定何謂安全,也可能把市場准入規則握在少數公司手上。
把幾種常被混稱為「外部監督」的做法排在一起,差異會比較清楚:
| 關卡 | 能看到什麼 | 能不能擋發布 | 能不能自行公開 | 主要破口 |
|---|---|---|---|---|
| 外部顧問小組 | 公司提供的成果與議題 | 通常不能 | 依章程,可能可以 | 有建議權,沒有資料存取或停止保證 |
| 公司行為準則與內部 gate | 內部資料最多 | 可以,由公司自己決定 | 公司決定 | 商業時程同時影響判斷 |
| Embedded evaluator | 依契約取得 checkpoint、logs、員工訪談 | 通常只能建議 | 取決於 NDA 與審稿權 | 時間不足、付費關係、auditor shopping |
| 法律認可的獨立驗證組織 | 法規要求的資料與測試範圍 | 依制度可能觸發限制 | 依通報與公開規則 | 認證品質、資源與程序設計 |
| 政府發布審查 | 可依法要求提交的材料 | 可以延後或限制 | 受保密與行政程序限制 | 專業容量不足、標準不明與政治介入 |
「第三方」只回答評估者不在原團隊,不代表獨立。真正要看的是資訊權、時間、資金來源、停止權和公開權。
Embedded evaluator 的想法,是不要等模型完成後才拿到一個 API,而是在訓練期間比較不同 checkpoint、檢查 reward environment、閱讀 transcript 與內部紀錄,甚至訪談員工。這能抓到完成版 benchmark 看不到的變化,例如模型何時開始辨識評估、何時學會隱瞞。
過去的限制也很具體:Hugging Face 事件的外部調查大約只有一週;Apollo Research 測 Astra 時只有三天,並提醒在模型可能辨識 eval 的情況下,低失準率不是很強的安全證據。
9 月 18 日,Anthropic 又宣布與 Accenture 合作 embedded evaluation,聲稱評估者將取得接近員工的存取,雙方並預計各自投入至少 10 億美元、為期五年。這使構想往實際合約前進一步;Anthropic 也坦白,目前仍沒有一致的存取、報告與資助標準,而且第一批工作由受評公司直接出資。
錢由誰付不是唯一問題,卻不能假裝不存在。若評估者不能列出「哪些資料被拒絕」、報告發布前要由公司改稿,或公司能一直換到比較好說話的團隊,進駐再深也可能只是高級版顧問案。
不論最後一道門在公司、驗證組織或政府手上,至少應看到同一份可追溯材料:
model_release: sol-2026-09
scope: [api, agent, cyber]
capability_evals:
- domain: cyber
dataset_version: cyber-eval-17
result_hash: sha256:...
control_evidence:
- control: egress_default_deny
test_run: runner-test-884
known_failures:
- id: MIS-27
status: mitigated
retest: retest-291
independent_review:
evaluator: external-org-id
access_denied: [customer_raw_data]
report_url: https://example.org/report
release_owner: board-risk-committee
decision: staged_release
這不是要把模型祕密全部公開。重點是讓「我們測過了」可以一路追到測試版本、失敗案例、修補後重測、外部評估者實際取得的範圍,以及最後簽字的人。
政府審查同樣需要門檻。若主管機關只說「先送來看看」,沒有風險分類、回覆期限、異議程序與保密規則,企業得到的不是安全標準,而是一個不可預測的發布排隊系統。2026 年 GPT-5.6 被要求限制在少數核准對象,就暴露了這個制度真空。
我不太相信存在一個全知的發布裁判。公司最懂模型,卻有上市與競爭壓力;評估者較獨立,卻仰賴存取和經費;政府有強制力,卻可能缺人、缺標準,也可能把安全和外交混在一起。
比較能工作的安排,是把權力拆開:公司負責產生證據,外部評估者能查核並公開限制,法律替重大風險設定最低義務,政府只在明確門檻下動用延後或限制權。任何一方說「相信」都不夠。
下一篇就看政府真的按下停止鍵後發生什麼。Fable/Mythos 的三週封鎖,剛好把技術判斷、程序正當性、商業競爭和地緣政治全部擠在同一件事裡。